Méthodes de type off-policy avec approximations

1.Introduction

Dans les modules précédents, nous avons utilisé les approximations de fonctions dans le cadre des méthodes on-policy (méthodes en ligne). Nous allons ici traiter les méthodes off-policy (méthodes hors ligne).

Rappelons que dans le cadre des méthodes d'apprentissage de type off-policy, nous cherchons à apprendre une fonction des valeurs des états et des actions d'une stratégie cible $\pi$ à partir de données récoltées par l'agent en suivant une stratégie d'exploration $b$ (stratégie comportementale). Lors de l'estimation des fonctions des valeurs des états $\hat v \approx {v_\pi }$ et des actions $\hat q \approx {q_\pi }$, les deux stratégies sont statiques et connues alors que lors de l'optimisation de la stratégie cible $\pi$ les deux stratégies change pendant l'apprentissage. La stratégie cible $\pi$ est de type greedy par rapport aux valeurs des actions $\hat q$ et la stratégie comportementale $b$ est de type $ϵ$-greedy ou $ϵ$-soft.

Les méthodes off-policy développées dans le cadre des environnements avec un nombre fini d'états que nous avons vu dans la formation d'initiation à l'apprentissage par renforcement sont applicables avec les algorithmes du semi-gradient, mais leur convergence n'est pas aussi robuste que dans le cadre des méthodes on-policy. Nous allons dans ce module étudier ces problèmes de convergence.

La difficulté de l'apprentissage de type off-policy peut être divisée en deux parties:

  • La première difficulté est associée aux cas tabulaires (environnements avec un nombre d'états finis). Ici, ce sont les mises à jour des cibles qui doivent être adaptées lorsque les données proviennent de la stratégie comportementale. On a utilisé pour cela la méthode d'échantillonnage préférentiel, qui peut malheureusement augmenter la variance mais est indispensable pour avoir des algorithmes fonctionnels.

  • La seconde difficulté n'est présente que lors de l'utilisation des fonctions d'approximation. Ici, l'échantillonnage préférentiel est également requis mais c'est la distribution des mises à jour qui va apporter une nouvelle problématique. Celle-ci n'est pas en accord avec les conditions de stabilités requises que l'on trouve dans les méthodes on-policy.

Deux approches ont été étudiées pour traiter ce problème:

  • La première approche est d'utiliser l'échantillonnage préférentiel afin de transformer la distribution des mises à jour vers une distribution de type on-policy. Cela permet d'appliquer les méthodes de semi-gradient et d'assurer leur convergence dans le cas des approximations linéaires.
  • La seconde approche est de développer d'autres algorithmes de gradient dont la stabilité ne dépend pas de la forme de la distribution.